Harness Engineering
1. 大白话:这是什么?解决什么痛点?
Harness Engineering 可以用一句非常好记的话来概括:Agent = Model + Harness。如果把大模型看成 CPU,那么 Harness 就是外面的操作系统和工作环境。模型只负责推理和生成,Harness 负责把状态、工具、反馈、执行环境和安全边界串起来,让 Agent 真的能稳定干活。
它解决的核心痛点是:很多 Agent 表现差,不是因为模型不够强,而是因为模型外侧的系统没搭好。大模型本质上只是输入输出函数,它自己记不住历史、不会跑代码、不知道有没有做对、也不会自动恢复错误。真正让 Agent 稳定、可执行、可纠偏的,往往是模型之外那套基础设施。
所以面试里可以一句话总结:Harness Engineering 研究的不是“怎么把 Prompt 写漂亮”,而是“怎么给模型搭一套能持续执行、持续校验、持续恢复的工程系统”。
2. 底层机制与高频考点
六层架构
一个成熟的 Harness 通常可以拆成六层:
- 信息边界层:决定 Agent 该知道什么、不该知道什么,负责目标拆解、角色定义、状态裁剪。
- 工具系统层:决定 Agent 怎么和外部世界交互,比如工具调用、MCP、文件系统、Web Search。
- 执行编排层:决定多步骤任务按什么轨道推进,不让模型胡乱跳步。
- 记忆与状态层:决定当前任务状态、中间产物和长期记忆怎么分层管理。
- 评估与观测层:决定 Agent 怎么知道自己做对了没有,比如测试、评测器、浏览器验证、日志追踪。
- 约束与恢复层:决定出错了怎么办,比如护栏、重试、回滚、降级、熔断。
高频对比考点
1. Harness vs Prompt Engineering vs Context Engineering
- Prompt Engineering:解决“怎么把指令说清楚”。
- Context Engineering:解决“每次该给模型看什么”。
- Harness Engineering:解决“系统怎么持续执行、纠偏、观测和恢复”。
它们不是并列关系,而是一层套一层。简单任务可能 Prompt 就够了;需要外部知识时 Context 更重要;到了长链路、低容错、可执行的商业场景,Harness 才会变成主要矛盾。
2. 为什么瓶颈常常不在模型
Harness 的关键思想是:不要把 Agent 表现完全归因于模型本身。 同一个模型,换一套工具接口、反馈链路和验证回路,表现可能差出一个数量级。真正卡住系统效果的,很多时候是工具难用、反馈缺失、上下文污染、错误恢复机制薄弱,而不是模型参数不够大。
3. 上下文越多不一定越聪明
Harness 还关心长任务中的上下文污染问题。上下文不是越长越好,信息太多反而会进入“Dumb Zone”,出现幻觉增多、兜圈子、格式混乱、代码质量下降。治理手段不是无脑塞更多信息,而是做上下文压缩、渐进式披露、必要时 context reset,再用结构化交接文档保留关键状态。
4. Model-Harness 耦合
很多 Agent 产品里的模型和 Harness 是一起被调优出来的,所以模型可能“习惯”某套工具环境。面试时要能说出一个关键结论:最适合当前业务任务的 Harness,不一定是模型原厂默认那套。
3. 🎯 实战口径
在我的 [[苍穹外卖AI客服]] 项目里,我对 Harness Engineering 的理解不是额外造一个新名词,而是用它来解释为什么 Agent 不是“模型一接上就能上线”的。
我的项目里,模型只负责理解用户意图和生成结构化调用倾向,真正让系统稳定可用的是外面的 Harness:
- 信息边界层:识别当前任务目标,不把所有历史和所有规则一股脑塞给模型。
- 工具系统层:通过 Spring AI Tool Calling 和工具白名单控制模型能用哪些能力。
- 执行编排层:通过 Advisor 链把意图识别、上下文注入、RAG、工具过滤按顺序串起来。
- 记忆与状态层:区分对话级短期上下文和真正要持久化的业务记忆。
- 评估与观测层:通过工具结果解析、日志和业务状态校验判断任务有没有真的完成。
- 约束与恢复层:通过
SafeToolCallAdvisor限制重复签名和最大调用轮次,防止工具死循环。
所以我会这样答辩:我的项目不是单纯在“调一个大模型”,而是在给模型搭一套 Harness。模型负责思考,Harness 负责把思考变成可控执行。真正决定 Agent 上限的,很多时候不是模型本身,而是这套外围系统有没有把上下文、工具、状态、验证和恢复机制设计好。
相关链接:[[AI Agent 核心概念]] | [[上下文工程]] | [[AI Agent 记忆系统]] | [[MCP 协议]] | [[Spring AI Advisor 链]] | [[Spring AI 安全治理]] | [[苍穹外卖AI客服]]